Type: paper
Confidence: 0.95
Created: 2026-04-18
Updated: 2026-04-18
Tags: 论文机器学习深度学习优化

Adam: A Method for Stochastic Optimization (2014 论文)

概述 (50-200字符)

Diederik P. KingmaJimmy Ba 于 2014 年提交 arXiv、发表于 ICLR 2015 的里程碑论文,提出 Adam 自适应矩估计优化算法。该算法成为深度学习训练默认优化器,引用率超过 10 万次。

关键内容 (≥300字符, 用双链)

  1. 问题动机:论文指出随机梯度下降(SGD)在实际神经网络训练中存在四大痛点:(a) 学习率难以选取;(b) 所有参数共用同一学习率,无法适应梯度尺度差异;(c) 鞍点(Saddle Point)处梯度趋零导致更新停滞;(d) 不同层参数量级相差千倍,统一学习率无法兼顾。
  2. 核心算法:提出 Adam = Momentum(动量) + RMSProp + 偏差修正(Bias Correction)。一阶矩 mₜ 追踪梯度均值(动量),二阶矩 vₜ 追踪梯度方差(自适应学习率),偏差修正 m̂ₜ、v̂ₜ 解决初始化时矩估计偏向零的问题。推荐默认超参数:η=0.001, β₁=0.9, β₂=0.999, ε=1e-8,开箱即用。
  3. 理论贡献:论文提供了凸设定下的收敛性证明,展示 Adam 的后悔界(regret bound)与最优静态解相当。偏差修正项 (1-βᵗ) 在训练初期至关重要,随 t 增大自动消失。
  4. 历史影响:Adam 让深度学习训练变成"自动挡"——无需精心调学习率,算法为每个参数自动找到合适速度。后续衍生出AdamW解耦权重衰减)、AMSGrad(修正收敛问题)、Adafactor(内存高效)等变体,形成了完整的自适应优化器家族。

来源

相关